前面聊到:只有當資料、工具與執行流程都正確,模型仍穩定做錯同一類事情時,才需要考慮 Fine-tuning。
確認問題在模型之後,團隊通常會開始估算訓練資料量。但資料型態取決於模型缺少哪一類能力,這項判斷必須先完成。
它可能不熟悉某個產業的語言,也可能看得懂資料,卻不會依照團隊要求完成任務。還有一些情況沒有唯一標準答案,只能比較兩個做法哪個更好;更複雜的任務,甚至要等模型實際操作之後,才能判斷是否成功。
這些問題需要的訓練方法並不相同。本文會先說明 Fine-tuning 在模型生命週期中的位置,再整理 Continued pretraining、SFT、DPO 與 RL 分別適合處理什麼問題。至於資料如何清理、切分與標註,留到下一篇再談。
大型語言模型首先會經過 Pretraining。模型從大量文本中學習語言規律、知識關聯與基本能力,主要目標是預測下一個 token。這個階段產生的是 Base Model。它能續寫文字,卻不一定能穩定理解指令、依照人類期待回答,或在不該回答時拒絕。
接下來是 Post-training。開發者使用指令示範、偏好比較與環境回饋,調整模型如何回應使用者。SFT、偏好最佳化與 RL 都可能出現在這個階段。Post-training 因此是一段模型生命週期,不是某一種固定演算法。
企業通常不會從 Base Model 開始,而是取得一個已完成 Instruction tuning 的模型,再用自己的資料做額外調整。如果使用企業的輸入與理想輸出做 SFT,較精確的說法是:在既有模型上追加一輪針對企業任務的 SFT。這可以視為額外的後訓練階段,但不代表重新執行模型供應商原本的整套 Post-training。
另外一種情況是,企業拿大量未標註的領域文本,繼續執行與 Pretraining 相近的語言模型訓練。這稱為 Continued pretraining,目的在於適應新的文本分布。它與使用標準答案調整任務行為的 SFT 並不相同。

SFT、DPO 與 RL 決定模型根據什麼學習;Full Fine-tuning 與 LoRA 決定訓練時更新多少參數。
理解這個位置之後,Fine-tuning 可以拆成三個獨立判斷:從哪一個模型版本開始、希望模型根據什麼學習,以及要更新全部參數還是只更新一小部分參數。多數討論的混亂,都是把這三件事放在同一張清單裡比較。
選擇方法時,先描述模型目前缺少的能力,再確認團隊能提供什麼資料或回饋。
| 要解決的問題 | 團隊能提供什麼 | 常見方法 |
|---|---|---|
| 模型不熟悉領域用語與文本分布 | 大量未標註的領域文本 | Continued pretraining |
| 已知每種輸入應該產生什麼結果 | 輸入與正確示範 | SFT |
| 沒有唯一答案,但能比較哪個較好 | 成對的偏好資料 | DPO/偏好最佳化 |
| 必須實際嘗試後才能判斷成敗 | 可驗證結果或可靠的 reward | RL/Reinforcement Fine-tuning |
Continued pretraining 適合處理領域分布。例如模型需要熟悉醫療術語、企業內部程式碼,或某類特殊文件的寫法,可以用大量原始文本繼續訓練。它可能改善模型對領域內容的表示能力,但不會直接教會模型遇到某個案件時應採取哪個動作。
SFT 使用輸入與理想輸出的配對。當團隊能示範正確分類、回答格式、工具呼叫或決策順序時,模型可以學習在相似輸入下產生這些輸出。SFT 適合有明確目標行為的問題。
DPO 等偏好最佳化方法使用成對比較。某些任務沒有唯一答案,但團隊可以判斷兩個答案中哪一個更符合品質、風險或服務原則。此時,偏好資料能表達「比較好」的方向,而不必假設只有一種正確寫法。
RL 或 Reinforcement Fine-tuning 適合必須執行後才能判定品質的任務。模型先產生解題或操作過程,再由測試、規則、模擬環境或其他驗證器提供回饋。程式是否通過測試、數學答案能否驗證,以及多步操作是否達成目標,都屬於這類問題。
這四種方法不是成熟度階梯,也不是新方法取代舊方法。它們使用不同依據改變模型,實際系統也可能分階段組合。2026 年的後訓練綜論便將 SFT、偏好最佳化、RL、蒸餾與驗證器引導方法,整理為處理不同模型行為瓶頸的方式。
同一個退款 Agent,可能同時出現四種表面相似、實際不同的問題。
如果模型連保險、退款或跨境交易中的專業表達都無法正確掌握,Continued pretraining 可能有幫助。但政策會持續更新,而且判斷必須指出來源時,最新內容仍應由 RAG 或其他可追溯機制提供。這部分的責任邊界已在前一篇說明。
如果模型看得到正確政策,卻經常漏掉例外條款、選錯工具或填錯參數,問題比較接近 SFT。團隊可以提供正確示範,讓模型學習何時查詢、使用哪個工具,以及取得結果後如何做下一個判斷。
如果兩個處理方式都符合規定,但其中一個更謹慎、更容易讓使用者理解,這不是單一標準答案的問題。團隊可以收集成對比較,透過 DPO 等方法學習偏好的取捨。
如果 Agent 必須完成多次查詢、取得核准並呼叫付款服務,最後才能知道退款是否完成,單純模仿一條示範路徑未必足夠。這時可以考慮 RL 或驗證器引導訓練,讓模型產生不同操作過程,再依實際結果調整策略。
不過,RL 的前提是評分方式可信。如果獎勵只看工單是否關閉,模型可能學會快速關單,卻沒有真正解決問題。DeepSeek-R1 的研究也顯示,RL 可以在可驗證任務中發展出推理與自我檢查能力,但只依賴 RL 也可能出現可讀性差與語言混雜,因此後續仍加入 SFT 與多階段訓練。這個結果主要來自數學、程式與科學問題,不能直接套用到沒有明確答案的客服決策。
對 Agent 來說,方法選擇可以簡化成三句話:有正確動作可以示範,用 SFT;有多個可行動作但能比較好壞,用偏好最佳化;只有執行後才知道是否成功,再考慮 RL。
SFT、DPO 與 RL 說明模型要根據什麼學習;Full Fine-tuning 與 LoRA 則說明訓練時要更新多少參數。這是兩個不同維度。
Full Fine-tuning 會更新模型的全部參數。LoRA 則凍結原有參數,另外訓練一組較小的低秩矩陣,以降低記憶體、儲存與訓練成本。LoRA 可以搭配 SFT,也可以搭配 DPO。不能因為團隊決定使用 LoRA,就認為已經回答了應採用哪種學習資料。
參數更新範圍也不決定資料目的。即使只更新少量參數,如果資料提供的是正確示範,做的仍是 SFT;如果資料提供的是成對偏好,解決的仍是偏好最佳化問題。
LoRA 也不代表沒有能力回退。它減少可訓練參數與客製模型的儲存成本,但模型行為仍可能因資料分布與訓練步數而改變。方法與參數更新方式選定後,仍然需要完整的回歸測試。
模型在訓練時會學習資料中反覆共同出現的模式。團隊想改善一項行為,其他行為也可能受到影響。
2026 年刊登於 Nature 的研究使用 SFT,讓五種不同架構與規模的模型產生更溫暖的回答。除了語氣改變,四類問答任務的錯誤機率平均也增加 7.43 個百分點,模型也更容易附和使用者的錯誤信念。
這項結果來自特定資料、模型與任務,不能推論成所有語氣微調都會降低準確率。它說明的是:如果資料中的溫暖表達經常與認同、安撫及避免反駁一起出現,模型可能同時學到這些行為。
因此,退款 Agent 的 SFT 如果要改善工具選擇,也要檢查是否增加不必要的工具呼叫;如果要提高積極協助的比例,也要檢查是否更常跳過澄清或接受錯誤前提。微調後的驗收不能只有目標指標,還要包含相鄰行為與原有能力。
現在,Fine-tuning 的決策順序已經清楚:先確認問題是否屬於模型,再判斷要補的是領域分布、正確行為、相對偏好或可驗證結果,最後才選擇訓練方法與參數更新方式。
下一篇會進入資料工程。方法一旦確定,才知道需要準備原始領域文本、正確示範、偏好比較,還是帶有環境回饋的操作紀錄。即使一筆工單最後顯示成功,其中仍可能包含錯誤決策、人工補救與事後才出現的資訊,不能直接當成訓練資料。

工程師:「我只想讓回答更親切。」
AI:「但你提供的示範,也都先同意使用者。」